ZHENESJAKOTHVIRUFRAR

假设检验

一句话解释:假设检验是一套用样本数据来判断“关于总体的某个说法是否成立”的统计方法——你先立一个假设,再看手头的数据是否离谱到足以推翻它。

对独立站和跨境电商来说,它就是“用数据说话”的底层逻辑:新落地页真的比旧版好吗?广告 A 组的转化率真的高于 B 组吗?还是只是随机波动?


生活化类比:法庭审判

假设检验的逻辑和法庭判案几乎一模一样:

- 原假设 H₀(无罪推定):默认被告无罪。在业务里就是“新版和旧版没有区别”“广告 A 和 B 转化率一样”。

- 备择假设 H₁:检方主张“被告有罪”,即“新版确实更好”。

- 证据(样本数据):你收集到的转化率、客单价、点击率。

- 判决标准(显著性水平 α):通常设为 0.05,相当于“要定罪,证据必须足够强,强到只有 5% 的概率是巧合”。

- p 值:在“被告无罪”的前提下,出现当前证据(或更极端证据)的概率。p 值越小,证据越不利于 H₀。

关键点:你永远不能“证明”H₀ 为真,只能说“证据不足以推翻它”。就像无罪释放不等于真的清白。


核心概念与公式

概念含义业务中的叫法
原假设 H₀默认成立的“无差异”假设“新版没效果”
备择假设 H₁想证明的“有差异”假设“新版更好”
显著性水平 α允许犯“弃真错误”的概率通常 0.05
p 值数据与原假设的“矛盾程度”越小越显著
统计功效 1-β真有效时能检测出来的概率通常要求 ≥ 0.8
样本量 n参与实验的用户数决定灵敏度

核心判断规则:若 p 值 < α,拒绝 H₀,认为差异显著;否则不拒绝 H₀。

以两比例 z 检验(A/B 测试最常用)为例:

$$z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}}$$

其中 $\hat{p}_1、\hat{p}_2$ 是两组样本转化率,$\hat{p}$ 是合并转化率,$n_1、n_2$ 是两组样本量。


与相关术语对比

术语核心问题与假设检验的关系
置信区间参数可能落在哪个范围?与假设检验互为镜像:95% 置信区间不含 0,等价于 α=0.05 下显著
p 值数据有多“极端”?假设检验的判决依据,但不是“结论正确的概率”
A/B 测试哪个版本更好?假设检验最常见的业务应用形式
统计功效真差异能否被检出?决定样本量和实验可靠性
第一类错误 α误判有效(假阳性)把没效果的当成有效,浪费预算
第二类错误 β漏判有效(假阴性)把有效果的当成无效,错失增长

应用场景(含数据案例)

案例 1:落地页改版 A/B 测试

某独立站旧版落地页转化率 3.2%(n=5,000),新版 3.8%(n=5,000)。合并转化率 3.5%,代入公式得 z ≈ 1.63,对应 p ≈ 0.10 > 0.05。结论:差异不显著,不能贸然全量上线——需要更大样本或更长周期。

案例 2:广告素材效果对比

Facebook 广告 A 组 CTR 1.5%(曝光 20,000),B 组 CTR 1.9%(曝光 20,000)。z ≈ 3.1,p ≈ 0.002 < 0.01。结论:B 组显著更优,可放心把预算倾斜到 B 组。

案例 3:邮件营销主题行测试

主题行 X 打开率 22%(发送 8,000 封),主题行 Y 打开率 24.5%(发送 8,000 封)。p ≈ 0.0002,差异高度显著。结论:Y 主题行值得作为模板沉淀。

案例 4:定价策略验证

新价格使客单价从 $45 升到 $48,但转化率从 2.5% 降到 2.3%。需要同时检验两个指标,并计算每访客收入(RPV)是否显著提升,避免“单指标显著、整体利润下降”的陷阱。


常见误区

1. p < 0.05 就等于“效果很大”:p 值只说明“不太可能是巧合”,不说明效应大小。样本量足够大时,0.1% 的微小差异也可能显著。

2. p > 0.05 就等于“没效果”:可能只是样本量不足、功效太低。应报告置信区间,而非简单二元结论。

3. 偷看数据、提前停止实验:多次检验会大幅抬高假阳性率。应预先确定样本量和实验周期。

4. 多重比较不校正:同时测 20 个指标,按 α=0.05 期望就有 1 个“假显著”。需用 Bonferroni 等方法校正。

5. 把统计显著当成业务显著:转化率提升 0.05% 可能统计显著,但不足以覆盖开发成本。

6. 忽略辛普森悖论:整体显著,分渠道后可能反转,需分层分析。


相关术语

- 置信区间(Confidence Interval)

- p 值(p-value)

- A/B 测试(A/B Testing)

- 统计功效(Statistical Power)

- 第一类错误 / 第二类错误

- t 检验 / z 检验 / 卡方检验

- 样本量计算(Sample Size Calculation)

- 多重比较校正(Bonferroni Correction)

- 辛普森悖论(Simpson's Paradox)